Ledigt jobb: Infrastrukturarkitekt
- Jobb
- AI Laboratory Infrastructure & Operations Engineer
AI Laboratory Infrastructure & Operations Engineer
KYLG ABStockholms län, Sollentuna
Tidigare erfarenhet är önskad
AI Laboratory Infrastructure & Operations Engineer
Om oss
Vi är ett AI- och dataminingbolag i utveckling. Vår AI-infrastruktur inkluderar NVIDIA GPU-cluster, enterprise AI-plattformar, milstora miljöer för modellträning och inferens samt intelligent automatisering av AI-arbetsflöden.
Vi expanderar vårt AI-laboratorium och söker en erfaren ingenjör för att bygga och driva vår AI-datormiljö.
Ansvarsområden
Du kommer att delta i planering, driftsättning, drift och underhåll av vår AI-laboratorieinfrastruktur, inklusive:
- Design, driftsättning och underhåll av AI-servrar och GPU-infrastruktur
- Installation, montering, kabeldragning, driftsättning och underhåll av AI-servrar i datacentermiljöer
- Planering och genomförande av expansion, uppgraderingar och hårdvarulevscykelhantering för AI-infrastruktur
- Driftsättning och hantering av Linux-servrar
- Installation, konfiguration och underhåll av NVIDIA CUDA, Docker, Kubernetes och AI-mjukvarustacken
- Driftsättning och optimering av miljöer för AI-modellträning och inferens
- Byggande och underhåll av AI-agentplattformar
- Utveckling av AI-arbetsflöden och automatiseringspipelines
- Underhåll av AI-datorcluster och GPU-infrastruktur
- Övervakning av systemprestanda och optimering av GPU-användningen
- Övervakning av strömfördelning, kylsystem och allmän hårdvarohälsa
- Felsökning av hårdvaru-, GPU-, nätverks-, lagrings-, operativsystem- och mjukvaruproblem på AI-servrar
- Stöd till AI-forskare och mjukvaruingenjörer
Krav
- Starka kunskaper inom Linux-systemadministration
- Erfarenhet av deployment, installation, underhåll och felsökning av AI-serverhårdvara
- Erfarenhet av datacenterinfrastruktur, inklusive strömfördelning, rackmontering, kabeldragning, kylning och driftsättning av hårdvara
- Erfarenhet av deployment och underhåll av NVIDIA GPU-servrar
- Erfarenhet av Docker
- Erfarenhet av Python
- Erfarenhet av CUDA
- Erfarenhet av AI-ramverk (PyTorch / TensorFlow)
- Kunskap om LLM-deployment
- Erfarenhet av Git
- Erfarenhet av enterprise-nätverk (10/25/100Gb Ethernet eller InfiniBand)
- Erfarenhet av montering, uppgradering och reparation av enterprise-servrar
Meriterande
- Kubernetes
- Slurm
- Ansible
- GPU-clusterhantering
- AI-agentplattformar
- LangChain
- MCP
- Vector Database
- RAG
- Arbetsflödesautomatisering
- CI/CD
Övrigt
Erfarenhet av ett eller flera av följande:
- Multi-GPU träning
- Distribuerad AI-datorberäkning
- NVIDIA DGX
- AI-datacenter
- Enterprise AI-infrastruktur
- InfiniBand eller annan högpresterande nätverksteknik
- Lagersystem (NAS / SAN)
- OpenAI API
- DeepSeek
- Qwen
- Llama
Vad vi erbjuder
- Konkurrenskraftig lön
- Flexibel arbetsmiljö
- Möjlighet att arbeta med banbrytande AI-teknologier
- Karriärmöjligheter inom AI-infrastruktur och intelligenta system
Språkkrav
- Engelska krävs
- Kinesiska är en stark merit (Mandarin är mycket meriterande, då rollen innebär samarbete med våra kinesiska ingenjörsteam och teknisk dokumentation.)
🖐 Passar detta jobb någon du känner?
Andra jobb inom samma område
Kanske kan det vara dags att bredda sökningen med dessa lediga jobb